Видео с ютуба Inference Optimization
Освоение оптимизации вывода LLM: от теории до экономически эффективного внедрения: Марк Мойу
Почему делать логические выводы сложно...
AI Inference: The Secret to AI's Superpowers
Золотой треугольник оптимизации вывода: баланс между задержкой, пропускной способностью и качеством.
Deep Dive: Optimizing LLM inference
Faster LLMs: Accelerate Inference with Speculative Decoding
LLM Inference Optimization Explained: KV Cache, Speculative Decoding & Cost | Chapter 9
What is vLLM? Efficient AI Inference for Large Language Models
Next 100x in AI: Inference, Networking, & Self-Optimizing Models — Philip Kiely & Ali Taha, Baseten
LLM inference optimization: Architecture, KV cache and Flash attention
LLM inference optimization: Model Quantization and Distillation
Оптимизация вывода LLM для всех остальных — Абдель Сгиуар, Google
Квантование против обрезки против дистилляции: оптимизация нейронных сетей для вывода
Deep Dive into Inference Optimization for LLMs with Philip Kiely
How KV Cache Speeds Up LLMs for Faster AI Models on GPUs
Inference Optimization Explained in 60 Seconds | What is Inference Optimization?
Understanding the LLM Inference Workload - Mark Moyou, NVIDIA
How the VLLM inference engine works?
Оптимизация инференса LLM: Квантование, батчинг и параллелизм
Optimize LLM inference with vLLM